想在自己的 AI PC 上微调一个大模型,让它更懂你的业务——但打开教程一看,显存、内存、硬盘、数据格式,每一步都有坑。微调不是推理,它对硬件的要求完全不同。
微调(Fine-tuning)和推理(Inference)是两回事。推理是“让模型回答问题”,微调是“让模型学会你的知识”。推理对内存要求相对低,微调则同时考验显存、系统内存和存储读写速度。
| 对比维度 | 推理(Inference) | 微调(Fine-tuning) |
|---|---|---|
| 显存需求 | 中等(模型大小 + 上下文) | 高(模型 + 优化器状态 + 梯度 + 激活值) |
| 内存需求 | 中等(模型加载 + 系统运行) | 高(数据预处理 + 梯度卸载) |
| 存储需求 | 低(模型文件) | 高(模型 + 数据集 + 检查点) |
| 持续负载 | 间歇性 | 长时间满载 |
| 典型工具 | Ollama、LM Studio | LLaMA-Factory、Unsloth、Axolotl |
核心认知:推理跑得动的设备,微调不一定跑得动。微调对硬件的压力是推理的 3~5 倍。
本地微调主要有三种方法,对硬件的要求差异很大:
| 微调方法 | 显存需求(7B 模型) | 内存需求 | 说明 |
|---|---|---|---|
| 全量微调 | 56GB+ | 64GB+ | 调整模型全部参数,硬件门槛极高 |
| LoRA | 16GB+ | 32GB | 只训练少量低秩矩阵,大幅降低显存 |
| QLoRA | 6~8GB | 16GB | 在 LoRA 基础上对基础模型做 4bit 量化,显存需求最低 |
对于大多数本地用户,QLoRA 是最务实的选择——它让 7B 模型的微调在一张 RTX 3060(12GB 显存)上成为可能。
| 配置项 | 最低要求 | 推荐配置 |
|---|---|---|
| 系统内存 | 16GB | 32GB |
| 显存 | 6GB | 12GB(RTX 3060) |
| 存储 | 50GB | 100GB NVMe SSD |
内存占用分析:
基础模型(4bit 量化):约 4.5GB
LoRA 适配器参数:约 0.5GB
激活值 + 梯度:约 2~3GB
系统 + 数据预处理:约 6~8GB
合计:约 13~16GB
16GB 内存是最低门槛,但运行会比较紧张。32GB 才能从容应对数据加载和预处理。
| 配置项 | 最低要求 | 推荐配置 |
|---|---|---|
| 系统内存 | 32GB | 64GB |
| 显存 | 10GB | 24GB(RTX 4090) |
| 存储 | 100GB | 200GB+ NVMe SSD |
内存占用分析:
基础模型(4bit 量化):约 7.5GB
优化器状态:约 2~4GB
激活值 + 数据缓存:约 8~12GB
系统 + 其他:约 8~10GB
合计:约 26~34GB
32GB 可跑通但余量有限,64GB 更稳妥。
| 配置项 | 推荐配置 |
|---|---|
| 系统内存 | 128GB+ |
| 显存 | 48GB+(A100 80GB 或多卡) |
| 存储 | 1TB+ NVMe SSD |
说明:30B 以上模型的微调已经进入专业工作站领域,对普通用户来说成本较高。建议采用“云 GPU + 本地推理”的混合方案——在云端租用 A100 做微调,在本地 AI PC 上跑推理。
微调过程中,硬盘需要存放以下内容:
| 存储内容 | 7B 模型 | 13B 模型 | 30B 模型 |
|---|---|---|---|
| 基础模型文件 | ~14GB(FP16) | ~26GB | ~60GB |
| 量化后的模型 | ~4.5GB | ~7.5GB | ~16GB |
| 微调数据集 | 1~10GB | 5~30GB | 20~100GB |
| 训练检查点 | 5~20GB | 10~40GB | 30~100GB |
| LoRA 适配器(输出) | ~200MB | ~400MB | ~1GB |
| 系统 + 工具 | ~15GB | ~15GB | ~15GB |
| 合计(最低) | ~30GB | ~60GB | ~150GB |
| 推荐容量 | 100GB+ | 200GB+ | 500GB+ |
关键提醒:训练检查点(checkpoint)会随着训练轮次不断累积,如果不及时清理,可能占用数十 GB 空间。
| 硬盘类型 | 读取速度 | 适合微调吗? | 说明 |
|---|---|---|---|
| NVMe PCIe 4.0 SSD | 5000~7000 MB/s | 强烈推荐 | 模型加载和检查点保存速度快 |
| SATA SSD | 500 MB/s | 可用但慢 | 加载大模型时等待时间长 |
| HDD 机械硬盘 | 100~200 MB/s | 不推荐 | 微调过程中会成为严重瓶颈 |
为什么必须用 NVMe SSD:
微调过程中需要频繁读写检查点
数据集加载速度直接影响训练效率
模型文件动辄数十 GB,HDD 读取需要几分钟
| 微调规模 | 系统内存 | 显存 | 存储 | 适合的微调方法 |
|---|---|---|---|---|
| 7B QLoRA | 16GB(最低)/ 32GB(推荐) | 6~8GB | 100GB NVMe SSD | QLoRA |
| 7B LoRA | 32GB | 16GB | 150GB NVMe SSD | LoRA |
| 13B QLoRA | 32GB(最低)/ 64GB(推荐) | 10~12GB | 200GB NVMe SSD | QLoRA |
| 13B LoRA | 64GB | 24GB | 300GB NVMe SSD | LoRA |
| 30B QLoRA | 64~128GB | 20~24GB | 500GB NVMe SSD | QLoRA |
| 全量微调(7B) | 64GB+ | 56GB+ | 500GB+ | 全量 |
很多人只关注“显存够不够”,忽略了系统内存。实际上,数据预处理、检查点卸载、梯度累积都需要系统内存支持。QLoRA 微调 7B 模型,16GB 系统内存是底线,32GB 才从容。
微调过程中会频繁读写模型文件和数据集。HDD 的随机读写速度远低于 SSD,会成为整个训练流程的瓶颈,导致训练时间大幅延长。
训练检查点(checkpoint)是微调过程中保存的模型状态快照。如果不设置自动清理策略,几十个检查点可能占用上百 GB 空间。
推理对硬件的要求远低于微调。一台能流畅跑 7B 模型推理的设备(16GB 内存 + 6GB 显存),做 7B 模型的 QLoRA 微调时可能内存不足。微调需要单独评估配置。
A:可以,但需要采用 QLoRA 方法(4bit 量化),显存占用约 6GB,系统内存约 13~16GB。16GB 是最低门槛,运行会比较紧张,建议 32GB 以获得更流畅的体验。
A:最低约 30GB(含模型 + 数据集 + 系统),推荐 100GB 以上 NVMe SSD。如果保留多个检查点,建议 200GB+。
A:技术上可以,但速度极慢(比 GPU 慢 50~100 倍),不推荐。微调必须依赖 GPU 或 NPU 加速。
A:目前 NPU 主要用于推理,对微调的支持仍在发展中。主流微调工具(LLaMA-Factory、Unsloth)主要支持 NVIDIA CUDA 和部分 AMD ROCm。如果以微调为主要需求,建议选择带独立显卡的设备(如 RTX 3060 及以上)。
A:使用 LoRA/QLoRA 微调,输出的适配器文件很小(约 200MB~1GB)。如果合并到基础模型,则需要完整模型大小的存储空间(7B 约 4.5~14GB)。
| 对比 | 云 GPU | 本地微调 |
|---|---|---|
| 初始成本 | 低(按小时计费) | 中(硬件投入) |
| 长期成本 | 持续支出 | 一次性投入 |
| 数据隐私 | 数据上传云端 | 数据不出设备 |
| 灵活性 | 随时切换配置 | 固定配置 |
| 适合场景 | 临时任务、大模型 | 高频微调、数据敏感 |
建议:高频微调 + 数据敏感 → 本地;低频或临时任务 → 云 GPU。